بطاقة النموذج

نموذج مشاعر متعدد الوسائط، بقياسات معلنة

كل رقم في هذه الصفحة منقول من دفتر التدريب المرفق بالمشروع — البنية، وأعداد البيانات، وقواعد التقييم نفسها. لا شيء هنا تقديري.

الصوت

7.5M

شبكة التفافية + BiLSTM + RNN فوق أطياف log-Mel

الفيديو

33.3M

ResNet3D r3d_18 فوق مقاطع من 16 إطارًا

الدمج

0.2M

شبكة MLP فوق متجه الدمج بـ 568 بُعدًا

من التسجيل إلى المؤشر

ما يمر به الفيديو المرسل قبل ظهور النتيجة.

  1. 1

    استخراج الصوت

    ffmpeg → 16 kHz mono WAV

  2. 2

    تقييم الكلام

    128-band log-Mel → CNN + BiLSTM + RNN

  3. 3

    تقييم حركة الوجه

    16 frames @ 112 px → ResNet3D r3d_18

  4. 4

    دمج الإشارتين

    568-dim vector → Fusion MLP

  5. 5

    الترجمة إلى مؤشرات

    Softmax → rule-based indicator scores

البنية

مكوّنات كل مرحلة والإشارة التي تستهلكها.

الصوت

شبكة التفافية + BiLSTM + RNN فوق أطياف log-Mel

الطبقات

  • CNN 64 → 128 → 256 → 512
  • BiLSTM 256 → 512
  • SimpleRNN 512
  • Dense 128 → 64
  • Softmax 8

المواصفات

المدخل
128-band log-Mel, 188 × 128
معدل العيّنة
16 kHz
نافذة FFT
1024
طول القفزة
256
التأكيد المسبق
0.97
موازنة الفئات
SMOTE

الفيديو

ResNet3D r3d_18 فوق مقاطع من 16 إطارًا

الطبقات

  • ResNet3D r3d_18 backbone (pretrained)
  • Frozen stem + layer1
  • 3D CNN head 256 → 128 → 64
  • Dropout 0.3
  • Softmax 8

المواصفات

المدخل
16 × 112 × 112 RGB clip
طول التسلسل
16 frames
حجم الإطار
112 px
المعاملات
33.3 M
التعلّم بالنقل
Kinetics-400 weights

الدمج

شبكة MLP فوق متجه الدمج بـ 568 بُعدًا

الطبقات

  • Concatenate 568-dim vector
  • Dense 256 → 128 → 64 → 32
  • Dropout 0.3
  • Softmax 8
  • Rule-based indicator layer

المواصفات

المدخل
568-dim fused vector
التكوين
MFCC 40 + audio softmax 8 + R3D 512 + video softmax 8
اضمحلال الأوزان
1e-4
جدولة معدل التعلّم
StepLR ×0.5 / 30 epochs

مجموعة البيانات

دُرِّب النموذج وقُيِّم على تسجيلات صوت وفيديو متطابقة لكلام وغناء بمشاعر تمثيلية.

RAVDESS

Speech + Song, paired audio/video

عينات متطابقة
2,452
الفئات
8
حصة الاختبار
20%
حصة التحقق
20%

توزيع الفئات

هادئ 376
سعيد 376
حزين 376
غاضب 376
خائف 376
اشمئزاز 192
متفاجئ 192
محايد 188

حساب المؤشرات

تتحول مخرجات الدمج إلى أربعة مؤشرات عبر طبقة قواعد شفافة — بلا نموذج ثانٍ وبلا أوزان مُتعلَّمة، لذا يمكن تتبّع كل درجة رجوعًا إلى احتمالات المشاعر أعلاه.

احتمال اكتئاب

حزن مرتفع مع سعادة منخفضة. الضرب يعني وجوب تحقّق الشرطين معًا قبل ارتفاع الدرجة.

score = sad × (1 − happy)

احتمال قلق

يقوده الخوف، مع تعزيز بسيط من المفاجأة.

score = 0.85 × fearful + 0.15 × surprised

احتمال توتّر

يقوده الغضب، ويعزّزه الخوف.

score = 0.6 × angry + 0.4 × fearful

احتمال تبلّد وجداني

سيطرة حالة محايدة مسطّحة على التسجيل بأكمله.

score = neutral

لا يُسمّى أي مؤشر ما لم تبلغ درجته 15% على الأقل. وما دون ذلك يُعتبر النمط الوجداني مستقرًا.

هذه النتيجة ليست تشخيصًا طبيًا. يرجى استشارة مختص.

بيئة التشغيل والتدريب

البيئة التي أُنتجت عليها المقاييس المنشورة، والإعدادات التي دُرِّبت بها كل مرحلة.

المسرّع
NVIDIA Tesla T4 (14.6 GB)
PyTorch
2.10.0 + cu128
TensorFlow
2.20.0
البذرة العشوائية
42

المعاملات الفائقة

الصوت

معدل التعلّم
3e-4
حجم الدفعة
16
الحقب
100 (early stopped)
الإسقاط
0.2
اضمحلال الأوزان
1e-4
الإيقاف المبكر
20 epochs

الفيديو

معدل التعلّم
1e-4
حجم الدفعة
8
الحقب
25
الإسقاط
0.3
جدولة معدل التعلّم
×0.5 after 3 stale epochs
الشبكة الأساسية
stem + layer1 frozen

الدمج

معدل التعلّم
1e-3
حجم الدفعة
32
الحقب
150 (early stopped)
الإسقاط
0.3
اضمحلال الأوزان
1e-4
الإيقاف المبكر
25 epochs

جرّبه على تسجيلك أنت

الشبكات الثلاث نفسها، تعمل مباشرة على فيديو من دقيقتين.

ابدأ الآن